• Portal do Governo Brasileiro
  • Atualize sua Barra de Governo
  • Ir para o conteúdo 1
  • Ir para o menu 2
  • Ir para a busca 3
  • Ir para o rodapé 4
  • Acessibilidade
  • Alto Contraste
  • Mapa do Site
Topo
Laboratório Nacional de Computação Científica

LNCC

Ministério da Ciência, Tecnologia e Inovações
Instagram Linkedin Facebook YouTube
  • SDumont
  • Imprensa
  • SEI-MCTI
  • Webmail
  • Intranet
  • Fale Conosco
Destaques Result. Programas PCI-LNCC Resultado Final do 1º Processo Seletivo de 2021 Guia de Conduta
logo

O LNCC

  • Histórico
  • Missão
  • Estrutura Organizacional
  • Corpo Técnico Científico
  • Documentos Institucionais
  • Localização

Coordenações

  • Coordenação de Métodos Matemáticos e Computacionais - COMAC
  • Coordenação de Modelagem Computacional - COMOD
  • Coordenação de Pós-graduação e Aperfeiçoamento - COPGA
  • Coordenação de Tecnologia da Informação e Comunicação - COTIC
  • Coordenação de Gestão e Administração - COGEA

Pesquisa e Desenvolvimento

  • Linhas de Pesquisa
  • Produção Técnico-Científica
  • Projetos de P & D
  • Grupos de Pesquisa

Supercomputador SDUMONT - Computação de Alto Desempenho

  • Supercomputador Santos Dumont
  • CENAPAD
  • SINAPAD

Programas Nacionais

  • INCT-MACC
  • LABINFO
  • SINAPAD

Inovação

  • Incubadora
  • NitRio
  • Soluções para Empresas

Programas  Acadêmicos

  • Mestrado e Doutorado
  • Programa de Verão
  • Bolsas de Estudos

Eventos

Biblioteca

  • Biblioteca

Acesso à Informação

  • Institucional
  • Ações e Programas
  • Participação Social
  • Auditorias
  • Receitas e Despesas
  • Licitações, Contratos e Convênios
  • Servidores
  • Informações Classificadas
  • Serviço de Informação ao Cidadão - SIC
  • Perguntas Frequentes
  • Dados Abertos
  • Gestão Documental
  • Agenda do Diretor
  • Carta de serviço ao Cidadão
  • Sobre a Lei de Acesso à Informação
  • Assessoria de Comunicação
  • Ouvidoria
  • Comissão de Ética
  • Gestão de Riscos
  • Guia de Conduta
  • LGPD
 

EVENTO



Avaliação Centrada em Dados do Conhecimento Biomolecular em Modelos de Linguagem de Grande Porte

Tipo de evento:
Defesa de Dissertação de Mestrado


A crescente adoção de Modelos de Linguagem de Grande Porte (LLMs) na ciência em geral, e na bioinformática em particular, coloca questões sobre a confiabilidade do seu conhecimento sobre entidades científicas, particularmente entidades biomoleculares. Em experimentos iniciais nos quais os modelos foram confrontados com enunciados biomédicos, três desafios se mostraram especialmente relevantes: (1) a tendência dos modelos a favorecer entidades mais frequentes na literatura; (2) a possível diferença de comportamento entre arquiteturas densas e arquiteturas baseadas em Mistura de Especialistas (MoE); e (3) a dificuldade metodológica de avaliar respostas envolvendo sinônimos, variantes nomenclaturais e designações proteicas. Este estudo parte desses desafios para investigar em que medida o viés de popularidade presente nos corpora de pré-treinamento afeta a capacidade de diferentes arquiteturas de LLMs de recuperar entidades biomoleculares ao longo de todo o espectro de frequência bibliográfica. Para isso, propõe-se um benchmark estratificado e balanceado, composto por 4.000tarefas de preenchimento de lacunas (cloze tasks) derivadas de abstracts do PubMed, com1.000 tarefas por estrato. As entidades foram particionadas em quatro estratos de popularidade (Q1--Q4), definidos com base no repositório gene2pubmed do NCBI. Quatro modelos foram avaliados em regime zero-shot no supercomputador Santos Dumont (LNCC), permitindo comparar o desempenho de modelos densos e MoE diante da mesma distribuição controlada de entidades. A avaliação exigiu ainda enfrentar o problema da normalização semântica das respostas. Para isso, as saídas dos modelos foram processadas pelo Normalization Engine for Biological Benchmarking (NEBB), um pipeline semântico em três camadas que mapeia sinônimos e designações proteicas a símbolos canônicos do HGNC. Essa etapa mostrou-se indispensável: a normalização resgatou cerca de 30% dos acertos que seriam penalizados por uma correspondência estrita de strings, evidenciando que a avaliação de conhecimento biomolecular em LLMs depende criticamente de mecanismos robustos de normalização de entidades. Os resultados revelam uma degradação severa e transversal da acurácia na cauda longa da distribuição bibliográfica (Q4), com declínios relativos entre 78% e 81% em todas as arquiteturas. O modelo denso Llama 3.3 (70B) obteve a maior acurácia global auditada (37,3%), enquanto a variante MoE apresentou o pior desempenho em todos os estratos, indicando que o roteamento de especialistas, nesse caso, não mitigou o viés de popularidade. Mais do que uma simples lacuna de conhecimento, o viés revelou-se uma força direcional: em 77,6% dos erros, o gene incorretamente predito era mais citado que o gene correto, com razão mediana de 3,7 vezes, chegando a 16,3 vezes na cauda longa. Assim, quando falha, o modelo tende a deslocar ativamente sua predição para o centro da distribuição bibliográfica. Além disso, a forte concentração das falhas — 51,2% dos casos não foram recuperados por nenhum dos quatro modelos, valor 2,6 vezes maior do que seria esperado caso os erros fossem independentes — sugere que a limitação observada reside menos em escolhas pontuais de engenharia e mais na estrutura dos dados de pré-treinamento. Conclui-se que o viés de popularidade constitui uma limitação estrutural do pré-treinamento auto regressivo, não resolvida pela variante arquitetural MoE baseada em roteamento de especialistas. Para aplicações biomédicas, sua manifestação mais problemática não é a ausência de resposta, mas a produção aparentemente fluente de uma
entidade incorreta e mais popular.

Evento Híbrido
Local: Auditório do LNCC
Link da Transmissão: https://meet.google.com/zwz-cdvb-sit

Data Início: 08/09/2026
Hora: 09:30
Data Fim: 08/09/2026
Hora: 12:00

Local:  LNCC - Laboratório Nacional de Computação Ciêntifica - Auditorio B

Aluno:
Guilherme Henrique Bittencourt - - LNCC

Orientador:
Bernardo Nunes Gonçalves - Laboratório Nacional de Computação Científica - LNCC

Participante Banca Examinadora:
Ana Tereza Ribeiro de Vasconcelos - Laboratório Nacional de Computação Científica - LNCC
Bernardo Nunes Gonçalves - Laboratório Nacional de Computação Científica - LNCC
Sarajane Marques Peres. - Universidade de São Paulo - USP

Suplente Banca Examinadora:
Fabio Andre Machado Porto - Laboratório Nacional de Computação Científica - LNCC
Fabio Gagliardi Cozman - Universidade de São Paulo - USP


Últimas eventos

  •   Principal
  •   Hotéis/Pousadas
  •   Área do Inscrito
 
 Voltar para o topo
Rodapé

Principal

  • Estrutura Organizacional
  • Corpo Técnico Científico
  • Produção Técnico-Científica
  • Projetos de P & D
  • Mestrado e Doutorado
  • Bolsas de Estudos
  • Seminários
  • Congressos / Escolas / Cursos
  • Biblioteca

Acesso à Informação

  • Institucional
  • Ações e Programas
  • Participação Social
  • Auditorias
  • Receitas e Despesas
  • Licitações, Contratos e Convênios
  • Servidores
  • Informações Classificadas
  • Serviço de Informação ao Cidadão - SIC
  • Perguntas Frequentes
  • Dados Abertos
  • Gestão Documental
  • Agenda do Diretor
  • Carta de serviço ao Cidadão
  • Sobre a Lei de Acesso à Informação
  • Ouvidoria
  • Comissão de Ética
  • Gestão de Riscos
  • Guia de Conduta

Serviços

  • Fale Conosco
  • Assessoria de Comunicação

Redes Sociais

  • Instagram
  • Linkedin
  • Facebook
  • YouTube

Navegação

  • Acessibilidade
  • Mapa do Site

Brasil - Governo Federal   Brasil - Governo Federal